Prédire la difficulté des requêtes : la combinaison de mesures statistiques et sémantiques

نویسنده

  • Adrian-Gabriel Chifu
چکیده

The performance of an Information Retrieval System (IRS) is closely related to the query. The queries that lead to retrieval failure are referenced in the literature as "difficult queries". This study aims at analysing, adapting and combining several difficulty predictors. The evaluation of the prediction is based on the correlation between the predicted difficulty and the IRS performance. As predictors, we have considered an ambiguity predictor, the IDF measure and a score distribution measure. We show that combining the proposed predictors, produce good results. The evaluation framework consists in the TREC7 and TREC8 ahdoc collections. MOTS-CLÉS : Recherche d’Information, prédire la performance, difficulté des requêtes, ambiguïté des requêtes, combinaison des prédicteurs, corrélation des mesures

برای دانلود رایگان متن کامل این مقاله و بیش از 32 میلیون مقاله دیگر ابتدا ثبت نام کنید

ثبت نام

اگر عضو سایت هستید لطفا وارد حساب کاربری خود شوید

منابع مشابه

Comment valider automatiquement des relations syntaxiques induites

Résumé. Nous présentons dans cet article des approches visant à valider des relations syntaxiques induites de type Verbe-Objet. Ainsi, nous proposons d’utiliser dans un premier temps une approche s’appuyant sur des vecteurs sémantiques déterminés à l’aide d’un thésaurus. La seconde approche emploie une validation Web. Nous effectuons des requêtes sur un moteur de recherche associées à des mesur...

متن کامل

MyBestQuery : un jeu sérieux pour apprendre des utilisateurs

En recherche d’information, une requête est difficile si les moteurs échouent à répondre de façon satisfaisante. Plusieurs prédicteurs automatiques de difficulté ont été proposés dans la littérature ; ils s’appuient essentiellement sur la façon dont les moteurs fonctionnent (IDF moyen des termes de la requête, écart type entre les scores des documents (Shtok, 2012)). Ils ne sont que peu corrélé...

متن کامل

Learning Domain-Specific, L1-Specific Measures of Word Readability

Improved readability ratings for second-language readers could have a huge impact in areas such as education, advertising, and information retrieval. We propose ways to adapt readability measures for users who (a) are proficient in a particular domain, and (b) have a particular native language (L1). Specifically, we predict the readability of individual words. Our learned models use a range of ...

متن کامل

Interrogation à base d'Annotation Sémantique

Résumé. Les approches de la recherche d’information (RI) actuelles ne saisissent pas formellement la signification explicite d'une requête à base de mots-clés mais fournissent une voie confortable pour l'utilisateur qui spécifie ces besoins en informations sur la base des mots-clés. La recherche sémantique promet de fournir des résultats plus précis que la traditionnelle recherche par mots-clés...

متن کامل

Exploitation des Liens Sémantiques pour l'Expansion de Requêtes dans un Système de Recherche d'Information

RÉSUMÉ: Dans cet article, nous proposons d’exploiter des liens sémantiques entre concepts pour améliorer la recherche d’information. Un thesaurus électronique de langue générale est utilisé pour la reformulation des requêtes utilisateurs en procédant par un processus d’"expansion prudente" en amont d’un moteur de recherche. Ce processus, transparent à l’utilisateur, exploite d’abord la notion d...

متن کامل

ذخیره در منابع من


  با ذخیره ی این منبع در منابع من، دسترسی به آن را برای استفاده های بعدی آسان تر کنید

عنوان ژورنال:

دوره   شماره 

صفحات  -

تاریخ انتشار 2013